谷歌面向部分用户测试 macOS 客户端重大语音升级,推出三大核心功能:系统级语音听写,支持全局快捷键在任何应用中实现语音转文字输入;“魔法指针”,让 Gemini 实时追踪光标悬停内容,确保视觉与逻辑同步;以及多设备连接菜单,暗示未来跨桌面协同。此次还重新设计了 Gemini Live 界面。
谷歌发布Gemini 3.5 Live Translate音频模型,通过实时语音到语音技术实现跨语言沟通突破,已集成至Google AI Studio、翻译和Meet等产品。其核心创新在于追求翻译“自然度”,摒弃传统轮流式翻译模式,旨在打破语言沟通的地理与文化障碍。
谷歌翻译的“实时翻译”功能现已支持iOS系统,用户只需搭配任意耳机即可在移动设备上实现低延迟跨语言对话,大幅降低了使用门槛。
谷歌在全球推出“Search Live”功能,用户可通过手机摄像头和语音与AI实时交互,实现多模态搜索。该功能由Gemini 3.1 Flash Live模型驱动,提升了对话的自然度和响应速度。
一个集成了Gemini多模态直播和WebRTC技术的单文件应用
AI驱动的移动对话体验
Openai
$2.8
输入tokens/百万
$11.2
输出tokens/百万
1k
上下文长度
Google
$0.49
$2.1
$7.7
$30.8
200
$0.7
$17.5
Alibaba
$8
$240
52
$0.4
-
128
$1.75
$14
400
Iflytek
$2
8
$8.75
$70
Tencent
$1
$3
4
Bytedance
$1.5
$4.5
$0.3
$0.6
32
$56
$1.4
131